Principe de fonctionnement
Comment peut-on utiliser les méthodes n-step non plus uniquement pour la prédiction mais pour le contrôle ? Une manière simple est de combiner la méthode Sarsa et la méthode n-step afin de réaliser une méthode de contrôle de type on-policy. La version Sarsa que nous avons vu précédemment est donc une méthode Sarsa(0).
L'idée est simplement de remplacer les états par les paires d'état-action et d'utiliser ensuite une stratégie de type ɛ-greedy. On définit les revenus obtenus par la méthodes n-step à partir des paires d'état-action:
avec ${G_{t:t + n}} = {G_t}$ si $(t+n) \ge T$.
L'équation utilisée dans l'algorithme est alors:
les valeurs de tous les autrres états restant inchangées: ${Q_{t + n}}\left( {s,a} \right) = {Q_{t + n - 1}}\left( {s,a} \right)$ pour tous les états $s \ne S_t$ et les actions $a \ne A_t$
Algorithme
